Оценка эффективности промптов через метрики самосогласованности (Self-Consistency) и калибровки ответов
Субисследование к аналитическому обзору [[academic_research_findings|академических программ]]. На основе курса CMU 17-630: Prompt Engineering (Travis Breaux, S3D Department). Для использования на семинаре СФИ — блок «Как понять, можно ли доверять ответу ИИ».
1. Ключевой посыл
Курс CMU 17-630 в описании прямо указывает:
«Students will learn about prompt engineering benchmark datasets and task goals, evaluation metrics, self-consistency, and calibration to evaluate the efficacy of prompt designs»
Неделя 6 посвящена калибровке:
«Alignment: Hallucinations — introduces alignment with focus on types and sources of hallucination, the benefits of calibrated models and strategies for reducing hallucination»
Среди обязательных чтений курса — работа «Calibrate Before Use» (Zhao et al., 2021, ICML).
Почему это важно для исследователя: когда ИИ даёт ответ, у вас нет встроенного способа понять, насколько модель уверена. Она говорит одинаково уверенным тоном и правильные факты, и галлюцинации. Self-consistency и калибровка — это инструменты, позволяющие измерить надёжность ответа без экспертной проверки каждого утверждения.
2. Self-Consistency: «Спроси несколько раз — сравни ответы»
2.1. Основополагающая работа
Wang, X. et al. (2023). «Self-Consistency Improves Chain of Thought Reasoning in Language Models». ICLR 2023.
Идея: вместо одного ответа модели (greedy decoding) — генерировать несколько независимых цепочек рассуждений и выбирать ответ большинством голосов.
Вопрос
/ | \
Путь 1 Путь 2 Путь 3 ... Путь N
↓ ↓ ↓ ↓
Ответ A Ответ A Ответ B Ответ A
→ Большинство = Ответ A (3 из 4) ✓
→ Ответ B — аутлайер (сигнал ненадёжности)
Результаты (PaLM-540B, GPT-3):
| Бенчмарк | CoT (один ответ) | CoT + Self-Consistency | Улучшение |
|---|---|---|---|
| GSM8K (арифметика) | — | — | +17.9% |
| SVAMP (математика) | — | — | +11.0% |
| AQuA (алгебра) | — | — | +12.2% |
| StrategyQA (здравый смысл) | — | — | +6.4% |
| ARC-challenge (наука) | — | — | +3.9% |
2.2. Почему это работает
Интуиция опирается на когнитивную науку (Stanovich & West, 2000):
Сложная задача обычно допускает несколько путей рассуждения, ведущих к правильному ответу. Чем сложнее задача — тем разнообразнее эти пути.
- Если модель уверена в ответе → разные пути рассуждений приведут к одному ответу
- Если модель не знает → разные пути приведут к разным ответам
- Степень согласия между путями = прокси для уверенности модели
2.3. Практическая реализация для исследователя
Уровень 1 — Ручной (без программирования):
Задайте один и тот же вопрос 3 раза в отдельных диалогах (новый чат каждый раз). Сравните ответы:
| Ситуация | Интерпретация | Действие |
|---|---|---|
| Все 3 ответа совпадают | Высокая уверенность модели | Можно использовать (с проверкой источника) |
| 2 из 3 совпадают | Средняя уверенность | Проверить расхождение вручную |
| Все 3 различаются | Модель не знает | Не доверять ни одному. Искать в источниках самостоятельно |
Уровень 2 — Через API (для продвинутых):
# Концептуальный пример (Claude API)
import anthropic
client = anthropic.Anthropic()
answers = []
for i in range(5): # 5 независимых запросов
response = client.messages.create(
model="claude-sonnet-4-5-20250514",
temperature=0.7, # важно: temperature > 0 для разнообразия
messages=[{"role": "user", "content": "Ваш вопрос"}]
)
answers.append(response.content[0].text)
# Анализ согласованности
# Если 4/5 ответов совпадают → высокая уверенность
# Если 3/5 → средняя; 2/5 или меньше → не доверять
Уровень 3 — Universal Self-Consistency (USC):
Chen, X. et al. (2024). «Universal Self-Consistency for Large Language Model Generation»
Стандартный SC работает только для задач с чётким ответом (число, дата). USC решает проблему для свободных текстов: модель сама сравнивает свои ответы и выбирает наиболее согласованный.
3. Калибровка: «Насколько модель уверена — и права ли она?»
3.1. Что такое калибровка
Калиброванная модель — та, у которой заявленная уверенность совпадает с реальной точностью:
- Если модель говорит «я уверена на 80%» → она должна быть права в 80% таких случаев
- Если модель говорит «я уверена на 50%» → она должна быть права в 50% случаев
Проблема: после RLHF-обучения модели становятся чрезмерно уверенными (overconfident) — они заявляют 95% уверенности, когда реальная точность 70%.
3.2. Ключевые метрики
| Метрика | Что измеряет | Формула (упрощённо) | Идеальное значение |
|---|---|---|---|
| ECE (Expected Calibration Error) | Средняя разница между уверенностью и точностью | Среднее | уверенность − точность |
| MCE (Maximum Calibration Error) | Наихудшее расхождение | Максимум | уверенность − точность |
| Brier Score | Комбинация точности и калибровки | Среднее (уверенность − правильность)² | 0 |
| AUROC | Способность отличать правильные ответы от неправильных | Площадь под ROC-кривой | 1.0 |
3.3. Calibrate Before Use (Zhao et al., 2021)
Обязательное чтение в CMU 17-630:
Zhao, T. Z. et al. (2021). «Calibrate Before Use: Improving Few-Shot Performance of Language Models». ICML 2021.
Открытие: few-shot промпты крайне нестабильны. Выбор формата, примеров и даже порядок примеров может изменить точность от случайной до лучшей в мире.
Причина: модель имеет врождённые предпочтения (bias) — например, чаще предсказывает ответы, расположенные ближе к концу промпта или чаще встречавшиеся в обучающих данных.
Решение — контекстуальная калибровка:
- Подать модели «пустой» ввод (например, «N/A»)
- Посмотреть распределение ответов → это и есть bias
- Скорректировать предсказания аффинным преобразованием
Результат: улучшение точности до 30 п.п. (абсолютных) при тех же промптах.
3.4. RLHF разрушает калибровку
Calibration Collapse Under Sycophancy Fine-Tuning (2026). OpenReview.
| Режим обучения | ECE (↓ лучше) | Эффект |
|---|---|---|
| Базовая модель | 0.107 | Исходная калибровка |
| Нейтральный SFT | Улучшается | Стандартная тренировка |
| Сикофантный GRPO | 0.107 → хуже | RLHF с наградой за согласие ухудшает калибровку |
| + Post-hoc scaling | 0.042 | Можно частично исправить |
Вывод: модели, обученные быть «полезными» (RLHF), теряют способность честно оценивать свою уверенность. Это прямая связь между [[Исследование феномена сикофантии (склонности ИИ льстить пользователю и подтверждать его неверные гипотезы) и галлюцинаций.|сикофантией]] и плохой калибровкой.
4. Оценка эффективности промптов: систематический подход
4.1. Зачем оценивать промпты
Большинство пользователей пишут промпты методом проб и ошибок. Курс CMU учит проектировать эксперименты для оценки промптов (цель обучения №2: «Design experiments to evaluate prompt designs»).
4.2. Фреймворк PEEM (2026)
PEEM (Prompt Engineering Evaluation Metrics) — arXiv:2603.10477
9-осевая оценка: 3 критерия промпта + 6 критериев ответа:
| Ось | Тип | Что оценивает |
|---|---|---|
| Clarity/Structure | Промпт | Ясность инструкций |
| Linguistic Quality | Промпт | Грамматика, точность формулировок |
| Fairness | Промпт | Отсутствие наводящих элементов |
| Accuracy | Ответ | Фактическая правильность |
| Coherence | Ответ | Логическая связность |
| Relevance | Ответ | Соответствие запросу |
| Objectivity | Ответ | Непредвзятость |
| Clarity | Ответ | Понятность ответа |
| Conciseness | Ответ | Лаконичность |
Корреляция PEEM-accuracy с традиционной accuracy: Spearman ρ ≈ 0.97.
4.3. Практические метрики для исследователя
Для гуманитарного исследователя не нужны сложные бенчмарки. Достаточно 4 вопросов:
| # | Вопрос | Что проверяет | Как проверить |
|---|---|---|---|
| 1 | Правильно ли? (Accuracy) | Фактическая точность | Проверка по источникам |
| 2 | Стабильно ли? (Consistency) | Воспроизводимость | Задать тот же вопрос 3 раза |
| 3 | Откуда это? (Groundedness) | Привязка к источнику | «Где именно в тексте это сказано?» |
| 4 | Честно ли? (Calibration) | Знает ли модель, чего не знает | «Оцени уверенность от 1 до 10» |
5. Техника «Вербализованная уверенность» (Verbalized Confidence)
Когда у вас нет доступа к API и внутренним вероятностям модели, можно попросить модель саму оценить уверенность:
5.1. Базовый промпт
Ответь на вопрос. После ответа добавь оценку уверенности:
- [УВЕРЕН] — Я точно знаю ответ, это общеизвестный факт
- [ВЕРОЯТНО] — Я помню это из обучения, но не уверен на 100%
- [ПРЕДПОЛОЖЕНИЕ] — Я экстраполирую, точного знания нет
- [НЕ ЗНАЮ] — У меня недостаточно данных
Вопрос: [ваш вопрос]
5.2. Числовая шкала
Ответь на вопрос и оцени свою уверенность по шкале 1–10,
где 1 = «полный домысел», 10 = «абсолютно точный факт».
Важно: не завышай оценку. Если ты не уверен — это нормально.
Лучше честно сказать «5», чем уверенно соврать «9».
Вопрос: [ваш вопрос]
5.3. Комбинация с self-consistency (VCSC)
Свежее исследование (2025):
«Verbal Confidence Meets Self-Consistency in Reasoning LLMs» (2025). OpenReview.
Находка: комбинация вербализованной уверенности + self-consistency (всего 2 повтора!) улучшает AUROC на 10+ п.п. Это самый простой и эффективный рецепт.
Практически: задайте вопрос дважды с просьбой оценить уверенность. Если и ответы, и уверенность совпадают — можно доверять. Если расходятся — красный флаг.
6. Disagreement как детектор ошибок
6.1. Принцип
Связь с [[Декомпозиция сложных задач на многоэтапные цепочки промптов (multi-stage prompting).|декомпозицией]]:
Madhwal et al. (2026). «Decomposed Prompting Does Not Fix Knowledge Gaps, But Helps Models Say "I Don't Know"». ACL Findings 2026.
Если ответ на прямой вопрос и ответ через декомпозицию расходятся — это надёжный сигнал ошибки (reliability multiplier). Этот disagreement-based abstention превосходит стандартные метрики неуверенности.
6.2. Практический тест «3 способа»
Способ 1 (прямой): «Кто автор Х?»
Способ 2 (с контекстом): «В документе Y говорится... Кто автор?»
Способ 3 (деком.): «Какие работы связаны с темой X?» → «Кто их авторы?»
| Результат | Интерпретация |
|---|---|
| Все 3 совпадают | ✅ Высокая надёжность |
| 2 из 3 совпадают | ⚠️ Проверить третий |
| Все разные | 🚫 Модель не знает — проверяйте вручную |
7. Black-Box Reliability: формальные гарантии (2026)
«Black-Box Reliability Certification for AI Agents via Self-Consistency Sampling and Conformal Calibration» (2026). arXiv:2602.21368
Авторы предложили reliability level — одно число, показывающее, насколько модель надёжна для данной задачи:
| Модель | Задача | Reliability Level |
|---|---|---|
| GPT-4.1 | GSM8K (математика) | 94.6% |
| GPT-4.1 | TruthfulQA (правдивость) | 96.8% |
| GPT-4.1-nano | MMLU (знания) | 66.5% |
| Llama 4 Maverick | GSM8K | 95.4% |
| Mistral Small 24B | MMLU | 66.7% |
Метод: задать один и тот же вопрос K раз → посчитать согласие → применить conformal calibration для формальных гарантий. Не нужен доступ к внутренностям модели — только API.
Значение для практика: «Нам нужна 90% надёжность — какие модели подходят?» — теперь на этот вопрос есть формальный ответ.
8. Пример для богословского исследования
Задача: Проверить надёжность ответа ИИ о датировке документа
Шаг 1 — Задать вопрос 3 раза (self-consistency):
Вопрос (в 3 отдельных чатах):
«К какому году относится «Определение» Поместного Собора
о восстановлении патриаршества?»
Результат: если все 3 раза модель отвечает «1917» — можно использовать. Если разброс (1917/1918/1921) — модель путается, нужна ручная проверка.
Шаг 2 — Запросить вербализованную уверенность:
«К какому году относится «Определение» Поместного Собора
о восстановлении патриаршества?
Оцени свою уверенность от 1 до 10.
Если ты экстраполируешь — скажи честно.»
Шаг 3 — Перекрёстная проверка (disagreement test):
Прямой вопрос: «Когда было принято определение?»
Через контекст: [загрузить текст определения] → «Какая дата стоит в этом документе?»
Если прямой ответ и ответ на основе документа расходятся → модель галлюцинирует дату из обучающих данных, а не читает ваш текст.
9. Что показать на семинаре
Демонстрация 1: «Спроси трижды» (3 мин)
- Открыть 3 вкладки с ChatGPT/Claude (новый чат в каждой)
- Задать один и тот же исследовательский вопрос
- Показать результаты рядом:
- Совпали → «Модель уверена»
- Разошлись → «Модель не знает, и вот простой способ это выявить»
Вывод для аудитории: «Это и есть self-consistency — техника, за которую Google Research получила публикацию на ICLR. И вы можете использовать её прямо сейчас, без программирования. Просто спросите три раза».
Демонстрация 2: «Уверенность на шкале» (2 мин)
- Задать вопрос: «Кто был секретарём Поместного Собора?»
- Тот же вопрос с добавкой: «…и оцени уверенность от 1 до 10»
- Показать: модель часто даёт себе 8–9, но ответ может быть неточным
- Повторить 3 раза → если оценки разные (8, 5, 7) — модель не уверена
Вывод: «Модели склонны завышать уверенность. Но если вы спросите дважды, и уверенность «скачет» — это надёжный красный флаг».
Ключевые тезисы для слайда
- 🔄 Спроси 3 раза: если ответы расходятся — модель не знает (self-consistency, ICLR 2023)
- 📊 Калибровка ≠ уверенный тон: модель говорит одинаково уверенно и правду, и ложь
- 📉 RLHF ломает калибровку: обучение «быть полезным» делает модели чрезмерно уверенными
- 🎯 Вербализованная уверенность: просите модель оценить себя (1–10) — и сравнивайте
- ⚖️ Disagreement = ошибка: расхождение прямого и декомпозированного ответов — лучший детектор
- 🎓 CMU учит это: «Calibrate Before Use» — обязательное чтение в курсе Prompt Engineering
10. Чек-лист: «Как проверить ответ ИИ за 2 минуты»
| # | Действие | Время | Что даёт |
|---|---|---|---|
| 1 | Задайте вопрос в новом чате ещё раз | 30 сек | Self-consistency: совпадёт ли ответ? |
| 2 | Попросите оценить уверенность (1–10) | 15 сек | Вербализованная калибровка |
| 3 | Попросите указать источник каждого утверждения | 30 сек | Groundedness: есть ли привязка к фактам? |
| 4 | Задайте вопрос другим способом (переформулируйте) | 30 сек | Disagreement test |
| 5 | Проверьте одну ключевую цитату/факт вручную | 30 сек | Spot-check: выборочная верификация |
Итого: 2.5 минуты на базовую проверку. Если все 5 пунктов «зелёные» — ответу можно доверять с оговорками. Если хотя бы 2 «красные» — ответ ненадёжен.
11. Связь с другими темами семинара
| Тема семинара | Связь с self-consistency и калибровкой |
|---|---|
| [[Декомпозиция сложных задач на многоэтапные цепочки промптов (multi-stage prompting).]] | Декомпозиция создаёт контрольные точки для промежуточной проверки; disagreement между прямым и декомпозированным ответом = сигнал ошибки |
| [[Исследование феномена сикофантии (склонности ИИ льстить пользователю и подтверждать его неверные гипотезы) и галлюцинаций.]] | RLHF → сикофантия → плохая калибровка → чрезмерная уверенность. Это одна цепочка |
| [[Использование агентных фреймворков (personas, memory models) и метода «агентных дебатов» (agent-based debate and collaboration) для верификации выводов.]] | Агентные дебаты = автоматизированный disagreement test с формальной верификацией |
| Парадигма 2 (Инструмент / API) | Self-consistency через API: автоматический sampling + majority vote |
| Парадигма 3 (Среда / NotebookLM) | RAG-система как форма grounding — привязка к источнику вместо калибровки вероятностей |
Источники
- Wang, X. et al. (2023). Self-Consistency Improves Chain of Thought Reasoning in Language Models. ICLR 2023. arXiv:2203.11171
- Zhao, T. Z. et al. (2021). Calibrate Before Use: Improving Few-Shot Performance of Language Models. ICML 2021. arXiv:2102.09690
- Chen, X. et al. (2024). Universal Self-Consistency for Large Language Model Generation. arXiv:2311.17311
- Madhwal, D. et al. (2026). Decomposed Prompting Does Not Fix Knowledge Gaps, But Helps Models Say "I Don't Know". ACL Findings 2026
- «Verbal Confidence Meets Self-Consistency in Reasoning LLMs» (2025). OpenReview
- «Black-Box Reliability Certification via Self-Consistency Sampling and Conformal Calibration» (2026). arXiv:2602.21368
- «Influences on LLM Calibration: Response Agreement, Loss Functions, and Prompt Styles» (2025). ACL 2025
- «Adaptive Temperature Scaling» (2024). EMNLP 2024 — калибровка после RLHF, улучшение 10–50%
- «Calibration Collapse Under Sycophancy Fine-Tuning» (2026). OpenReview
- PEEM: Prompt Engineering Evaluation Metrics (2026). arXiv:2603.10477
- «Evaluating Prompt Engineering Techniques for Accuracy» (2026). arXiv:2506.00072
- CMU 17-630 Syllabus & Schedule — cs.cmu.edu/~breaux/prompting
- CMU 11-667 Lecture: Prompt Engineering & Alignment — andrew.cmu.edu/course/11-667